Red-Teaming Medical AI: Systematic Adversarial Evaluation of LLM Safety Guardrails in Clinical Contexts
本論文は、医療 AI の安全性を評価するための体系的な攻撃分類と評価フレームワークを開発し、標準的なガードレールが教育目的を装った権威偽装攻撃には脆弱であることを明らかにした。
239 件の論文
ヘルスインフォマティクスは、医療の現場で生まれる膨大なデータを科学的に分析し、より良い治療や公衆衛生の意思決定に役立てる学際的な分野です。Gist.Scienceでは、この分野の最新動向を medRxiv から収集し、専門知識のない方でも理解できるよう平易な解説と、研究者向けの技術的な要約の両方を提供しています。
私たちは medRxiv に公開される新たなプレプリント論文を一つ一つ精査し、その核心となる発見をわかりやすく伝えることに注力しています。複雑な統計手法やアルゴリズムの背後にある医療へのインパクトを、専門用語に頼らずに掘り下げます。
以下に、ヘルスインフォマティクス分野の最新のプレプリント論文一覧を掲載します。
本論文は、医療 AI の安全性を評価するための体系的な攻撃分類と評価フレームワークを開発し、標準的なガードレールが教育目的を装った権威偽装攻撃には脆弱であることを明らかにした。
本論文は、NIH の AI-READI データセットにおけるラベル誤分類を XGBoost による反復的クリーニングと臨床レビューで修正し、修正済みデータを用いた Conv+BiLSTM 深層学習モデルにより、連続血糖モニタリングデータから前糖尿病状態を高精度(ROC-AUC 約 0.932)に検出する新たな診断フレームワークを提案しています。
この論文は、因果推論、解釈可能な効果ツリー、および較正評価を統合したフレームワークを提案し、統計的ノイズと実用的な臨床的知見を区別することで、周術期医療における信頼性の高い個別化治療選択を可能にすることを示しています。
この論文は、データプライバシーや再現性の観点からローカル環境にデプロイされた 200 億パラメータの LLM が、感度向上プロンプト戦略を用いてシステマティックレビューの抄録スクリーニングにおいて人間より高速に処理でき、特に技術関連トピックで有望な性能を示すことを実証したものである。
伝統的・補完的・統合的医学(TCIM)の編集者に対する調査により、AI ツールの将来性への高い期待が示される一方で、実用的・倫理的・制度的な障壁により実際の導入は限られており、責任ある活用に向けたガイドラインや教育の整備が急務であることが明らかになりました。
この研究は、医療 AI の信頼性が技術的性能だけでなく、サイバーセキュリティ専門家の視点に立脚したガバナンスと説明責任の実践によって構築されることを、質的調査を通じて明らかにしています。
この論文は、解剖学的プロトン MRI と代謝的ナトリウム MRI の情報を統合した方向性全変動正則化に基づく深層画像事前分布(DIP-Fusion)手法を提案し、低 SNR と長い撮像時間が課題であったナトリウム MRI の高画質化と撮像時間短縮を実現したことを報告しています。
本論文は、大規模言語モデル(LLM)を用いて臨床医による環境 AI 生成メモの編集を分類する可行性を評価し、特定の医療カテゴリーでは有望な性能を示したが、複雑な文脈依存の編集については人間のレビューへの選別ツールとして活用すべきであると結論付けています。
2025 年の医療 AI 研究は、従来の機械学習からマルチモーダル基盤モデルへの移行、研究発表数の倍増、および実世界での応用に向けた成熟という重要な転換点を迎えたことを示しています。
このコホート研究では、学術誌が研究の不正に関する懸念に対して発行する「編集者通知」「懸念表明」「撤回」のいずれの対応類型も、その後の論文引用数の減少傾向に統計的に有意な差をもたらさず、対照群における自然な減少傾向と同様であったと結論付けられています。